Back
精读 LWD:用 DIVL 分布式价值学习与 QAM 流策略提取,把 16 台双臂机器人部署产生的离线与在线经验闭环用于通用 VLA 持续改进。
paper deep dive
vla
offline-to-online rl
robot fleet